融合算子：Tanh-Affine-Gate（一次核内完成仿射与双曲正切门控，返回 y = x * tanh(α*z + β)，其中 z = x*scale + bias）。tanh 门控在强非线性抑制与平滑饱和之间取得平衡，适合稳定的逐维缩放。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`g = tanh(alpha*z + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：PyTorch 参考 `Model` 与统一的输入/初始化接口
- `cudacode.py`：`load_inline` 嵌入单核融合（仿射+tanh 门控+乘法）；`-O3 --use_fast_math`
- `run_code.py`：100 次迭代统计平均耗时；精度 `rtol=1e-03, atol=1e-06`；输出加速比

CUDA 实现要点
- 行并行：`grid = B`，块内沿 D 连续访存；每行仅一次遍历并写回
- 对齐向量化：满足 16 字节对齐且 `D%4==0` 时使用 `float4`；否则标量路径
- 指令优化：仿射用 `fmaf`；tanh 走 `--use_fast_math`；循环 `#pragma unroll 4`
- 线程配置：起步 `block=1024`，可根据设备与 D 尺寸试探最佳值

评估与目标
- 精度：参考实现与 CUDA 结果在 `rtol=1e-03, atol=1e-06` 范围内一致
- 性能：期望 ≥1.0x，加速来源于融合与向量化

加分项（可选）
- 针对未对齐场景优化尾处理，减少分支与内存不对齐带来的额外开销
- 在大 D 场景下每线程处理多元素批量步长以提升吞吐

